圖/本報資料庫
人工智慧
5 hours ago

#人工智慧
#AI模型
#職場應用
#柏克萊加州大學
#技術瓶頸
圖/本報資料庫
圖/本報資料庫
商傳媒|林昭衡/綜合外電報導
摘要

柏克萊加州大學的最新研究指出,前沿 AI 模型在模擬實際職場任務的測驗中表現不佳,即使是 OpenAI 的 GPT-5.5,整體通過率也僅 24%,在困難任務上所有模型甚至成功率為零,顯示 AI 在複雜工作上仍遠不及人類。

最新研究指出,儘管人工智慧(AI)技術發展迅速,但前沿 AI 模型在實際職場任務中的表現仍遠不及預期。一項由柏克萊加州大學發布的報告揭露,即使是頂尖的 AI 工具,在涵蓋多種職業的測驗中,最高整體通過率也僅有 24%。

這項研究來自柏克萊加州大學的 Center for Responsible, Decentralized Intelligence,旨在評估前沿 AI 工具在各種職場任務上的「就業準備度」。研究人員設計了一套名為「代理人最終考試」(Agents’ Last Exam,簡稱 ALE)的評估工具,其中包含超過 1,500 項由專家制定的任務,涵蓋 55 種不同職業。這些任務不僅包括軟體工程與平面設計等常見的 AI 應用領域,也擴及海事工程、農業、音訊製作及公共衛生營運等。

研究測試了 Anthropic’s Fable 5、OpenAI 的 GPT-5.5、Cursor’s Composer 2.5 及谷歌的 Gemini 3.1 Pro 等先進閉源模型,以及兩款中國開發的開源模型。結果顯示所有模型表現皆不佳,其中 OpenAI 的 GPT-5.5 取得最高分,整體通過率為 24%。然而,在 ALE 最困難的任務層級上,包含 Fable 5 在內的所有前沿代理,成功率均為 0%。值得注意的是,Anthropic’s Fable 5 在任務完成度上與 GPT-5.5 及 Composer 2.5 表現相似,但每完成一項任務的成本卻高出 4 到 12 倍。

研究人員指出,儘管目前的 AI 代理已能解決相當部分的專業任務,但對於需要持續推理、深厚領域專業知識以及長期可靠執行的困難任務,其表現仍與人類水準相去甚遠。柏克萊電腦科學研究員宋曉冬(Dawn Song)表示,即使目前的通過率相對較低,那些由例行性、明確定義程序主導的職業,仍可能率先受到 AI 的衝擊,而需要大量決策的角色則能維持較長時間的韌性。她強調:「關鍵因素不在於產業本身,而在於工作的性質。」

這項研究表明,儘管 AI 產業迄今已投入 1.6 兆美元,但要讓前沿 AI 模型在複雜的現實職場任務中達到人類水準的表現,仍有漫長的路要走。對於台灣企業而言,這項研究結果提供了重要啟示:導入 AI 應著重於自動化例行性工作,而對於需要高度判斷與專業的任務,仍需輔以人類智慧,避免過度期待。